標簽【policy gradient】

花費 5 ms

花了一天時間大致了解了強化學習一些經典算法，總結成如下筆記。筆記中出現不少流程圖，不是我自己畫的都標了出處。鋪墊 1. Bellman方程在介紹強化學習算法之前先介紹一個比較重要的 ...

Policy Gradient Methods 之前學過的強化學習幾乎都是所謂的‘行動－價值’方法，也就是說這些方法先是學習每個行動在特定狀態下的價值，之后在每個狀態，根據當每個動作的估計價值進行選 ...